Skip to content

Detecting formatted text: Data collection using computer vision

Colner (2025)

DisciplineComputational
MethodComputational
Tagscomputer visiondata · archival recordsdata collectionlocal governmentmethod · machine learningocrtext extraction

Summary

Problem: 政治学研究中存在大量格式不佳的PDF文档(如会议记录),其中包含嵌套的子节结构。研究者通常需要提取这些子节(如议程项目)来构建数据集,但现有的OCR技术只能提取完整文本,无法区分文本子节;正则表达式过于精确而常常失效;手工提取则耗时费力。目前政治学界尚未充分利用人工智能模型(如大语言模型和对象检测模型)来解决数据提取阶段的问题。 Approach: 本文提出一个三步工作流程:(1) 使用Label Studio(开源数据标注平台)对文档页面图像进行手工标注,框出目标文本子节;(2) 使用Fast R-CNN R50-FPN对象检测模型(基于Detectron2)进行微调训练,识别与标注格式相似的文本段;(3) 使用LayoutParser工具包配合Tesseract OCR提取框内文本,生成结构化数据集。作者以加州五个城市的市议会会议记录中的议程项目提取作为验证案例。 Finding: 该方法能够准确提取文档中的文本子节,仅需少量手工标注文档(每城每年两份会议记录)即可充分训练模型。与两个基准数据集(Legistar软件数据和手工编码数据)比较,该方法在议程项目数量上高度吻合,词汇相似度指标(精确率、Jaccard相似度、余弦相似度、Levenshtein距离)均表现良好。此外,该方法每城约需1小时,而手工编码约需31小时,速度快30倍以上。 Significance: 本文展示了对象检测模型在文本数据处理中的新用途,为政治学研究者提供了一种高效、免费、可复现的数据提取方法。该方法特别适用于地方政治研究(如市县会议记录),有助于缓解数据可得性对次国家政府研究的制约,也为处理行政命令、公司会议记录、国际组织会议记录等类似文档提供了新工具。

Theoretical Framework

N/A

Research Design

本文属于方法论文献(letter),采用计算方法的实证演示设计。研究类型为方法验证研究,以市议会会议记录中的议程项目提取为案例。分析单元为单个议程项目(文本子节)。关键自变量为文档的视觉格式特征(如缩进、编号、排版模式),通过对象检测模型识别;因变量为议程项目的准确提取,通过多个相似度指标(精确率、Jaccard相似度、余弦相似度、Levenshtein距离)进行操作化测量。研究设计包括:(1) 训练集构建(每城每年两份会议记录,手工标注);(2) 模型训练与验证(70-30划分);(3) 模型应用于剩余会议记录;(4) 与两个基准数据集比较验证。

Data & Sample

样本为加州五个城市的市议会会议记录:Chula Vista、South San Francisco、Visalia、Santa Rosa和Temecula。选择这些城市的原因是存在可比较的基准数据集(Legistar立法管理软件数据)。每个城市单独处理(因格式模式需一致),每城每年选取两份会议记录作为训练集,其余会议记录用于模型应用。数据来源为公开的市政会议记录PDF文档。时间跨度为多年(具体年份未在正文中明确说明,但示例涉及2014年)。基准数据集包括:(1) Legistar软件中的议程项目记录;(2) 每城随机抽取20场会议的手工提取议程项目。

Analytical Strategy

分析策略包括两个层面:(1) 模型性能评估:使用平均精确率(average precision)评估对象检测模型的性能,与通用最先进对象检测模型得分比较;(2) 提取结果验证:将方法提取的议程项目与两个基准数据集比较,使用精确率(匹配项目数/方法识别总数)、Jaccard相似度、余弦相似度和Levenshtein距离等指标评估词汇相似度。此外,还比较了方法提取的议程项目数量与基准数据集数量随时间的变化趋势。作者未提及控制变量或额外的稳健性检验,但指出补充材料中包含更多细节(附录A-G)。

Results & Findings

  • 模型检测性能:对于每个城市,Fast R-CNN模型的平均精确率与通用最先进对象检测模型达到的分数相似,表明模型能够有效识别文档中格式化的文本子节。
  • 议程项目数量匹配:方法识别的议程项目数量与两个基准数据集(Legistar和手工编码)在时间上紧密匹配,且更接近手工编码的数量。这表明方法在识别议程项目数量方面高度准确。
  • 词汇相似度:匹配的议程项目对之间的词汇相似度在所有指标上均较高。具体而言,精确率在0.77-0.98之间,Jaccard相似度在0.81-0.97之间,余弦相似度在0.91-1.00之间,Levenshtein距离在0.64-0.96之间。其中Visalia表现最佳(余弦相似度1.00,Levenshtein距离0.96),Santa Rosa相对较弱(精确率0.77,Levenshtein距离0.64)。
  • 效率提升:该方法每城约需1小时完成,而手工编码约需31小时,速度提升超过30倍。
  • 训练数据需求:仅需每城每年两份会议记录的手工标注即可充分训练模型,无需大量标注数据。
  • 与假设的关系:结果验证了作者的核心预期——对象检测模型能够基于视觉格式模式准确识别和提取文本子节,且仅需少量训练数据即可达到高精度。

Limitations

作者在文中承认的局限性包括:

  • 该方法要求文档具有一致的格式模式,因此需要按城市(或按文档类型)分别处理,无法跨格式通用。
  • 该方法不适用于以下情况:(1) 文本已处理为数据集(如国家和州立法机构数据);(2) 研究者需要分析文档全文而非子节;(3) 目标子节可通过文本内容区分(如提取人名)而非视觉格式区分;(4) 文档数量少且子节数量少(如Spirling 2012的条约研究,手工编码可能更合适)。
  • 该方法依赖视觉格式特征,对文本语言不敏感,但这也意味着它无法处理格式不明显的文档。

Key Contributions

  • 首次提出将计算机视觉对象检测模型应用于政治学文本数据提取的工作流程,拓展了对象检测模型在文本数据领域的应用。
  • 提供了一个完全使用免费工具(Label Studio、LayoutParser、Tesseract OCR)的可复现方法,降低了数据提取的技术门槛。
  • 通过实证验证证明了该方法在准确性和效率上的优势(准确率高、速度快30倍以上)。
  • 为地方政治研究(如市县会议记录)提供了新的数据收集途径,有助于缓解次国家政府研究中的数据可得性障碍。
  • 该方法可推广到其他领域,如行政命令提取、公司/国际组织/工会会议记录、转录文本等。

Key Claims

"Research in political science has begun to explore how to use large language and object detection models to analyze text and visual data. However, few studies have explored how to use these tools for data extraction." (Abstract)

"I find the method can accurately extract subsections of text from a document and requires only a few hand labeled documents to adequately train." (Abstract)

"Finally, I find that this method is over 30 times faster than the alternative method of hand-copying each agenda item." (Section 1, Introduction)

"By demonstrating how a simple workflow based on easily accessible tools can be a powerful data collection process, this research note encourages researchers to reconsider the various uses of object detection models." (Section 1, Introduction)

"This method is ideal for difficult records that contain text segments of interest formatted in a visually distinct way from other text in the document but not capturable using regular expressions." (Section 5, When to Use This Method)


My Notes